Skip to content

Unsupervised learning predicts human perception and misperception of gloss

Storrs, Anderson, Fleming (2021)

DisciplineInterdisciplinary
MethodComputational
Tagsdata · experimentdeep neural networksgloss perceptionmethod · machine learningmethod · regressionperceptual constancyunsupervised learningvisual perception

Summary

Problem: 视觉系统如何从模糊的近端感觉输入中推断出远端物理原因(如材质、形状、光照)是视觉科学的核心难题。一个关键未解问题是:视觉系统在缺乏关于世界远端变量种类和数量的“地面真值”知识的情况下,这些对近端输入的可能解释最初是如何被获知的。传统观点认为需要显式学习近端线索与已知远端原因之间的映射,但本文质疑这一前提,探索视觉系统是否可能仅通过发现近端图像中的统计规律来“发现”远端变量的存在。 Approach: 作者采用计算建模与心理物理学实验相结合的方法。他们构建了一个模拟的“虚拟世界”,渲染了10,000张具有不同表面起伏、颜色、反射率(高光或哑光)和六种自然光照环境的凹凸表面图像。然后,他们训练了十实例的无监督生成式深度神经网络(PixelVAE),其训练目标仅为高效压缩和空间预测图像,不提供任何关于场景属性的标签。作为对照,他们还训练了十实例的监督式ResNet网络,用于根据地面真值标签对图像进行高/低光泽分类。随后,他们通过线性解码(SVM)从模型内部表征中提取光泽预测值,并将其与人类观察者在多个实验中的光泽感知判断进行比较。 Finding: 研究发现,无监督的PixelVAE网络在训练后,其10维潜在编码空间自发地按远端场景属性(如反射率和光照)对图像进行聚类,而原始像素空间或其他传统降维方法(如MDS、LLE)则无法做到这一点。更重要的是,从该无监督模型潜在编码中线性解码出的光泽预测值,不仅与人类对50张新渲染图像的光泽评分高度一致(平均R²=0.84),而且优于基于真实物理反射率的地面真值(R²=0.73)和所有对照模型(包括监督模型,R²=0.40)。该模型还成功预测了人类光泽恒常性的系统性失败,例如表面起伏更大的物体看起来更亮,并能预测特定光照与形状组合下的非单调错觉模式。相比之下,监督模型虽然能完美分类光泽,但在预测人类感知及其错觉方面表现极差,甚至出现反相关。 Significance: 这项研究为“无监督学习可能是视觉感知的基础”这一长期假设提供了强有力的证据。它表明,视觉系统可能并非通过显式学习近端线索与远端原因的映射来理解世界,而是通过发现并压缩图像中的统计规律,自发地分离出不同的远端变量。这为理解人类如何在没有明确外部指导的情况下发展出丰富的视觉感知能力提供了新的理论框架,并挑战了监督学习作为生物视觉模型的适用性。

Theoretical Framework

  • Theoretical tradition: 该研究属于计算神经科学与心理物理学的交叉领域,根植于“高效编码”和“无监督统计学习”的理论传统。
  • Prior theories built upon: 文章明确建立在以下理论或模型之上:1) 视觉推断理论(Helmholtzian 观点),即视觉系统推断最可能解释近端感觉输入的远端场景变量组合;2) 稀疏编码理论(sparse coding),即早期视觉皮层的神经响应特性可由训练生成自然图像块的稀疏编码模型预测;3) 表征相似性分析(RSA)方法;4) 生成式深度神经网络(如PixelVAE)作为图像统计结构的模型。
  • Causal mechanism: 核心机制是:近端图像的可变性由一组低维的远端环境因素(形状、反射率、光照)引起。因此,一个被鼓励发现图像紧凑表征的统计学习模型,会倾向于收敛于这些产生图像可变性的有限来源。只要不同的远端来源在近端输入中产生统计上可区分的效应,模型就能在没有先验知识的情况下分离它们。人类视觉系统可能通过类似的无监督学习过程,在进化或发展时间尺度上从近端刺激中获取关于世界的知识。
  • Key assumptions: 理论假设包括:1) 近端刺激的可变性由低维环境因素引起,因此图像间的变化可以更紧凑地以其潜在原因为表征;2) 不同的远端来源在近端输入中产生统计上可区分的效应;3) 视觉系统通过无监督方式学习这些统计规律,而非依赖显式的监督标签;4) 线性可读出的信息被视为模型或脑区“显式表征”的信息。
  • Theoretical move: 本文扩展了高效编码理论,将其从早期视觉的初始编码阶段推进到“中层次场景理解”(即推断远端物理原因)。同时,它挑战了监督学习作为生物视觉模型的适用性,提出无监督学习可能更好地解释人类感知的“成功”与“失败”模式。
  • Scope conditions: 该研究的结论基于特定的模拟环境(渲染的凹凸表面)和特定的网络架构(PixelVAE)。作者声称其发现可能推广到视觉及其他感知维度,但这一推广性需要进一步验证。模型预测的是人类感知的模式,而非感知的神经机制。

Research Design

本研究采用计算建模与心理物理学实验相结合的设计。研究类型为计算模拟与受控实验的混合。分析单元是单个图像或图像对。关键自变量包括:1) 表面反射率(高/低光泽,或连续变化);2) 表面起伏程度;3) 光照环境(六种自然光场及其旋转角度)。关键因变量是人类观察者的光泽感知判断(评分、排序、配对比较)。模型预测值(SVM决策值)作为预测变量与人类判断进行比较。操作化方式:人类光泽感知通过实验1的1-6级评分、实验2的排序任务、实验3a/3b的配对比较任务和实验4的配对比较任务来测量。模型预测值通过训练线性SVM分类器在模型潜在编码中分离高/低光泽图像,并计算新图像的决策值(即到超平面的有符号距离)来获得。

Data & Sample

  • 计算模型训练数据: 10,000张从模拟虚拟世界渲染的图像,包含不同的表面起伏、颜色、反射率(高/低光泽)和六种自然光照环境。
  • 人类实验被试: 实验1、2、3a、3b和4各招募了20名观察者(共100人次,可能为不同或重叠的被试组)。被试来源和地区未在提供的文本中明确说明,推测为大学环境(德国吉森大学)。
  • 数据收集方法: 受控实验室心理物理学实验。实验1要求被试对50张新渲染图像的光泽度进行1-6级评分;实验2要求被试对模型生成的图像序列按光泽度排序;实验3a/3b和实验4要求被试在配对比较任务中判断哪张图像看起来更亮。
  • 时间周期: 未在提供的文本中明确说明。
  • 数据来源: 图像由作者使用渲染引擎生成;人类行为数据通过实验收集。

Analytical Strategy

  • 模型分析: 使用t分布随机邻域嵌入(tSNE)可视化模型潜在编码中的图像聚类;使用表征相似性分析(RSA)量化不同场景属性(光泽、光照)在模型表征中的聚类程度,并通过重复测量t检验比较同条件与不同条件图像对的距离。
  • 模型预测与人类数据比较: 使用线性支持向量机(SVM)从模型潜在编码中解码光泽,获得连续预测值。将模型预测与人类评分进行回归分析(R²),并比较不同模型(无监督、监督、地面真值、其他备选模型)的预测性能。
  • 统计检验: 使用t检验(独立样本、单样本、重复测量)、方差分析(ANOVA,包括单因素重复测量和双因素混合设计)来比较模型性能、验证聚类效应和人类行为模式。
  • 控制变量: 渲染参数(如表面起伏、颜色、光照)被独立控制,以确保反射率不能从原始图像中平凡解码。
  • 稳健性检验: 训练了十个不同初始随机权重的模型实例,以确保结果对架构的表示差异具有稳健性。在实验3a/3b中,特意选择了无监督和监督模型预测不同的刺激序列,以提供最强的判别力。

Results & Findings

  • 无监督模型自发分离远端场景属性: 研究发现,无监督PixelVAE模型的10维潜在编码空间自发地按光泽度、光照环境和表面起伏对图像进行聚类。高光泽图像根据光照环境形成多个紧密子簇,低光泽图像形成一个大的簇。这种聚类在原始像素空间或其他传统降维方法(MDS、LLE)中不存在,表明模型确实学到了图像背后的物理原因。这一发现支持了理论预期,即无监督学习可以仅从图像统计中发现远端变量。
  • 无监督模型预测人类光泽感知优于地面真值: 在实验1中,从无监督模型潜在编码中线性解码出的光泽预测值与20名观察者的光泽评分高度一致(平均R²=0.84),显著优于监督模型(R²=0.40)和真实物理反射率(R²=0.73)。这意味着模型内部表征捕捉到了人类感知光泽的方式,甚至比物理真实值更接近人类判断。这支持了理论假设,即人类视觉系统可能通过类似的无监督统计学习来形成感知,而非精确估计物理属性。
  • 无监督模型预测人类光泽恒常性的失败: 在实验3和4中,无监督模型成功预测了人类观察者表现出的系统性光泽恒常性失败,例如表面起伏更大的物体看起来更亮,以及特定光照与形状组合导致的非单调错觉模式。模型正确预测了20个刺激序列中18个的定性模式(单调与非单调)。相比之下,监督模型几乎完全无法预测这些错觉,其预测与人类模式反相关(中位R²=-1.45)。这一发现至关重要,表明无监督学习不仅解释了感知的“成功”,还解释了感知的“失败”,即系统性的误归因。
  • 监督模型与备选模型表现不佳: 监督ResNet模型虽然能完美分类光泽(99.4%准确率),但其内部表征在预测人类感知方面远不如无监督模型。其他备选模型,包括对象识别DNN特征、多尺度纹理特征、简单自编码器特征、tSNE/MDS/LLE嵌入和亮度直方图偏度,均不如无监督模型。这表明无监督学习目标(压缩和预测)对于形成类人表征至关重要。
  • 零结果与意外发现: 研究发现监督模型在预测人类光泽恒常性失败时出现反相关,这是一个意外且显著的负面结果,凸显了监督学习目标与人类感知模式之间的根本差异。另一个意外发现是,无监督模型预测人类光泽评分优于地面真值,这表明人类感知并非对物理属性的忠实估计。

Limitations

  • 模拟环境的简化: 研究使用了渲染的凹凸表面作为刺激,这虽然提供了对场景统计的严格控制,但与真实世界的视觉场景相比仍显简化。模型和实验的推广性到更复杂的自然场景有待验证。
  • 网络架构的特定性: 研究仅测试了PixelVAE这一种无监督生成式架构。其他类型的无监督模型(如对比学习、自监督变换器)是否也能产生类似结果尚不清楚。
  • 线性解码的局限性: 使用线性SVM解码来量化模型表征,虽然符合神经科学中“线性可读性”的标准,但可能忽略了模型中非线性编码的信息。
  • 人类被试的局限性: 被试样本量较小(每个实验20人),且可能来自同一大学环境,代表性有限。
  • 因果关系的推断: 虽然模型预测了人类感知,但这只是相关性证据。研究不能直接证明人类视觉系统确实采用了与PixelVAE相同的学习算法或目标函数。
  • 训练数据的规模: 模型仅在10,000张图像上训练,远小于人类在自然环境中接触的视觉刺激量。

Key Contributions

  • 首次证明无监督生成式神经网络(PixelVAE)能够仅通过压缩和预测图像的任务,自发地在内部表征中分离出远端场景属性(如反射率、光照、表面起伏),无需任何显式标签。
  • 发现无监督模型的内部表征在预测人类光泽感知方面优于基于真实物理标签的监督模型和地面真值,表明无监督学习可能是形成类人感知表征的基础。
  • 成功预测了人类光泽恒常性的系统性失败(错觉),包括表面起伏导致的错觉和非单调的感知模式,这是任何计算模型模拟生物视觉的关键测试。
  • 提供了强有力的证据支持“视觉系统通过发现近端图像中的统计规律来推断远端原因”这一理论假设,为“我们如何在没有显式训练的情况下学会看”这一难题提供了潜在答案。
  • 挑战了监督学习作为生物视觉模型的适用性,揭示了监督学习目标与人类感知模式之间的根本差异。

Key Claims

"Here we explore the intriguing possibility that visual systems might be able to discover the operation of distal scene variables by learning statistical regularities in proximal images rather than by learning an explicit mapping between proximal cues and known distal causes." (Introduction)

"Our main finding is that the representation of gloss learned by an unsupervised PixelVAE network closely matches the pattern of successes and failures in perceived gloss shown by human observers." (Introduction)

"The unsupervised models better match human data than do a range of supervised networks and simpler comparison models, suggesting that the learning process by which different distal sources are disentangled may play a fundamental role in shaping our visual experience of the world." (Introduction)

"We thus find that the unsupervised networks develop internal representations that not only disentangle distal causes that are impossible to tease apart in the raw input but also, more remarkably, predict human gloss perception better than the true physical reflectance properties of surfaces, even though these networks are never given information about scene properties during training." (Results)

"The unsupervised model, despite never being explicitly trained to represent gloss and without being fit to human data, predicted patterns of failures of gloss constancy remarkably well." (Results)


My Notes